同一道 BE03,在較低與較高投入程度下,選到高類別的機率會差多少?CTT(古典測驗理論)從加總分的變異出發,因素模型看題目共變;今天用試題反應理論(IRT)直接描述這個機率。它把人的潛在位置 θ 與題目參數放在同一個模型尺度上,也要求我們明說維度、局部獨立與尺度識別等假設。
對二分題目,logistic(邏輯函數) 2PL(雙參數邏輯模型)可寫成:
P(Y_j = 1 | θ) = 1 / (1 + exp[−a_j (θ − b_j)])
在能力 θ 下答對第 j 題的機率,等於 1 除以 1 加上 exp 負 a_j 乘以 θ 減 b_j。
b_j 是曲線中點的位置;當 θ=b_j,機率為 0.5。a_j>0 控制曲線在中點附近的斜率/鑑別。這些詞只在指定模型與尺度下解釋,不是題目看一眼就擁有的永久屬性。
ENGAGE-v1 原本是五點題,直接套二分 2PL 會改變資料。為了手算,我定義一個教學用 derived 作答反應(response):BE03 選 4 或 5 記為 1,其餘記為 0,命名 BE03_hi。這只展示 2PL;正式分析應考慮保留 ordinal categories(有序類別)的 polytomous 模型(model)。二分化會丟失資訊,不能悄悄完成。
| 層 | 2PL 工作模型 |
|---|---|
| 資料機制 | 給定 latent θ,題目以 logistic probability 產生二分反應 |
| 目標 | person location θ、item location b、discrimination a 與反應機率 |
| 假設 | 選定維度、local independence、monotonic ICC、尺度識別、模型與母體適用 |
| 可觀察量 | item response patterns 與其頻率 |
| 估計規則 | marginal maximum likelihood 等校準 items,再以 ML/MAP/EAP 等估 person |
| 保證/限制 | 模型下連結 people/items 與局部精確度;不證明單維、內容品質或跨群體不變 |
IRT(試題反應理論)的 scale 沒有天然零點與單位,常透過潛在(latent) distribution 或題目(item) constraints 識別。換尺度時 a、b 的數值會改,作答反應 probabilities 可保持一致。因此不能跨未連結 calibration(題目參數校準)直接比較題目難度。
假設 BE03_hi 的 a=1.5、b=0.5。當 θ=0.5,指數部分為 0,所以 P=.5。當 θ=1.5:
P = 1 / [1 + exp(−1.5)] ≈ 0.818
當指數部分為 1.5,答對機率約 0.818。
當 θ=-0.5,則 P≈0.182。同一題對不同 θ 並非同樣容易出現高反應。
再比較一題 a=0.7, b=0.5。兩題在 θ=.5 都有 P=.5,但第二題曲線較平;θ 離開中點時,機率變化較慢。這是 discrimination 的局部意義,不是把學生分成「會/不會鑑別」。
2PL 在 logistic constant 取 1 時的題目資訊量(item information)是:
I_j(θ) = a_j² × P_j(θ) × [1 − P_j(θ)]
題目資訊量等於鑑別度的平方,乘以答對機率,再乘以答錯機率。
第一題在 θ=b=.5 的 information(題目資訊量)為 1.5²×.25=.5625。同一題在遠離 b 時,P(1-P) 下降,information 也下降。題目「好不好」必須附帶 在哪個 θ、為哪個用途。
請 Claude 解釋 a 與 b 時,可以用「b 是答對題目所需的能力」檢查用語。投入題沒有客觀答對;即使是成就題,b 也是模型下達到指定反應機率的位置。這裡應說「出現高類別反應」,並先交代二分規則,才不會把態度題偷偷換成成就測驗。
我再要求邊界測試:θ=b 必為 .5;a>0 時機率隨 θ 單調上升;θ 趨正/負無窮時接近 1/0;a 接近 0 時曲線接近平坦。逐點代入可抓符號反轉,這是語言解釋看不出的常見錯誤。
某題 a 很高,但內容只是「我一定會準時交作業」,它可能窄化行為投入,或受課程規定驅動。曲線很陡只表示模型下反應對 θ 的局部變化強,不處理內容代表性與公平性。
第二個 failure case(失敗案例)是 local dependence(題目間局部相依)。BE01 與 BE04 wording 高度重疊,給定 θ 後仍一起變動;模型可能把殘餘關聯吸收到 inflated discrimination 與 information。若不查題目殘差(residual)/testlets,CAT(電腦適性測驗)會過度相信重複題目。
第三個反例是把 b 當跨群體固定。Day 18 已顯示 BE04 有 group shift;在 IRT 語言可能呈現 DIF(差異試題功能)。若題目參數不具可比性,同一 scale 上的群體比較與適性選題都要重新檢查。
二分 IRT 也可視為對 categorical indicators(指標題目)的 latent-variable 模型;CFA(驗證性因素分析)與 IRT 並非互不相關的世界。差異在連結函數、作答量尺、參數化與主要用途。把兩者放在同一本書,能看見共同的識別、維度、local independence 與模型配適(模型與資料摘要的相容程度)責任。
可先用手算表回答一個問題:當 θ 恰好等於 b,兩道不同鑑別參數的題目機率都是 .5,但資訊量是否相同?代入公式即可看到 a 的平方仍在其中。這讓「反應機率相同」與「估計位置的資訊相同」分成兩個判斷,也為下一篇選題作準備。
教學表常把 a、b 當已知常數;真實應用先要用 calibration sample 估計。樣本小、θ 範圍窄、模型設定錯誤或稀少類別,都會增加不確定性。把 estimated 題目參數固定後再估 person,若忽略 calibration uncertainty,後續標準誤可能過度樂觀。本文手算只做條件於已知參數的解釋,不宣稱完成 calibration。
題目 fit(題目 fit(item fit),模型與資料摘要的相容程度)也不能只看一個總指標。可以按 θ 區段比較 observed 與 expected 作答反應、檢查殘差 dependence、看參數是否跨樣本穩定。若某題模型配適差,先回作答歷程(response process)與內容;刪除不是唯一答案,因為題庫 coverage 可能因此出現缺口。
判斷「差」之前,先分清楚每個指標在摘要什麼:
| 指標 | 它摘要什麼 | 它不能證明什麼 |
|---|---|---|
| CFI/TLI | 相對 baseline model 的改善 | 構念可區分 |
| RMSEA | 近似誤差與自由度 | 模型正確 |
| SRMR | 標準化殘差的平均大小 | 題目測到對的東西 |
五類題的正式模型還要處理多個 thresholds(切點)/category functions。graded 作答反應等模型可以保留類別資訊,但要求 categories 使用與 ordering 合理。若某選項幾乎沒人用,thresholds 不穩;把它合併也會改變作答反應 definition。這些都要記入資料處理,而不是由軟體靜默完成。
最後,person θ 是 model-based estimate,不是學生身上的物理刻度。ML 在全 0/全 1 pattern 可能出現極端問題,MAP/EAP 會受 prior(先驗分布)影響;報告時要記 estimator(估計方法)與 uncertainty。個人回饋若忽略這些,精緻小數只會製造虛假精確。
再用尺度轉換檢查一次:若 θ*=2θ+1,相應設定 b*=2b+1、a*=a/2,代入後有 a*(θ*-b*)=a(θ-b),機率因此不變。以本例 a=1.5,b=.5,θ=1.5 來看,新尺度是 .75,2,4,指數的大小仍為 1.5。未做尺度連結就比較兩次校準的 b,數字差不代表題目真的改變。
原問題的答案是:IRT 用作答反應 function 把 person location 與題目參數連在同一任意尺度,並讓精確度隨 θ 改變。它不讓 θ 變成直接觀察的能力,也不替題庫(item bank)取得內容效度。
發展閱讀看 Lord/Novick 與 Chalmers 的 mirt(R 的試題反應理論套件)模型;研究閱讀再進入多分類、多維度、DIF 與尺度連結。本篇留下曲線的手算點、資訊量與二分化限制。下一篇會用資訊量選第一題,再手算一次更新與第二題選擇;完整 CAT 的停止與失敗流程另列為設計要求。